Red-Teaming Medical AI: Systematic Adversarial Evaluation of LLM Safety Guardrails in Clinical Contexts
이 논문은 의료용 대형 언어 모델 (LLM) 의 안전성 방어를 체계적으로 평가하기 위한 적대적 공격 분류체계를 개발하고, 대부분의 공격에는 견고하지만 '교육적 목적'이라는 권위 사칭 공격에는 특히 취약하여 모델이 전문가 대상 응답 모드로 전환하는 경향이 있음을 규명했습니다.